Skip to content

Generalized kernel regularized least squares

Chang, Goplerud (2023)

DisciplineComputational
MethodTheoretical
Tagscomputational efficiencydata · secondary survey analysiskernel methodsmachine learningmethod · machine learningmethod · multilevel modelingstatistical modeling

Summary

Problem: 传统KRLS方法存在两个主要缺陷:一是模型结构不灵活,所有变量必须纳入单一核函数并统一正则化,无法结合随机效应、非惩罚固定效应、多核或非高斯结果;二是计算成本极高,估计复杂度随观测数呈立方增长,超过约10,000个观测即难以实用,即使勉强运行也需数小时。 Approach: 作者将KRLS重新表述为一种特殊的分层模型(hierarchical model),利用贝叶斯视角将核函数视为随机效应项,从而支持模块化模型构建——不同变量可按理论需要以不同方式进入模型(如固定效应、随机效应、样条、KRLS等)。同时,采用“子采样草图”(sub-sampling sketching)技术,从原始数据中随机抽取M个点构建核矩阵,将设计矩阵从N×N缩减为N×M,大幅降低计算和内存需求。正则化参数通过限制最大似然(REML)自动校准,无需昂贵的网格搜索或交叉验证。 Finding: 模拟实验表明,gKRLS在10,000个观测上仅需约6秒,100,000个观测约2分钟(单核、8GB内存),而传统KRLS和bigKRLS在超过10,000个观测时需数小时。在预测精度上,gKRLS与传统方法相当(除bigKRLS截断版本外)。另一项模拟显示,当数据生成过程包含组固定效应时,将固定效应置于核外(非正则化)比纳入核内(允许所有边际效应随组变化)在中等规模数据集上表现更好。两个实证分析(Newman 2016;Gulzar, Haas, and Pasquale 2020)验证了gKRLS在复杂模型(含随机效应、样条、KRLS及固定效应)和大规模数据(约30,000观测)上的实用性。 Significance: 该研究显著扩展了KRLS的适用场景,使其从仅能处理小规模、单一核、高斯结果的工具,转变为可处理大规模数据、支持模块化模型构建、兼容非高斯结果和多种机器学习算法(如DML、stacking)的通用框架。这为政治学及其他社会科学研究者提供了更灵活、更高效的非参数回归工具,降低了计算门槛,促进了复杂函数形式估计的普及。

Theoretical Framework

N/A

Research Design

本文为方法论论文,采用理论推导与模拟实验相结合的方式。研究类型为计算模拟(computational simulation),辅以两个实证案例展示。分析单元为模拟数据集中的观测个体。关键自变量为:模型类型(gKRLS vs. KRLS vs. bigKRLS)、草图乘数δ(5或15)、样本量N(100至1,000,000)、固定效应与核内变量的相关性ρ(0, 0.3, 0.6, 0.9)。因变量为:估计时间(分钟)、预测均方根误差(RMSE)、平均边际效应的估计误差。模拟数据生成过程采用Hainmueller和Hazlett(2014)的“Three Hills, Three Valleys”函数以及一个含固定效应的非线性函数。

Data & Sample

模拟数据:第一组模拟生成50个数据集,样本量从100到1,000,000(对数等距分布),每个观测包含两个协变量,结果由sin(x1)·cos(x2)加噪声生成。第二组模拟生成1,000个数据集,每组50个组(J=50)、每组10个观测(T=10),协变量x1与组固定效应μj的相关性由ρ控制。实证数据:Newman(2016)关于性别与精英主义信念的研究数据,以及Gulzar, Haas, and Pasquale(2020)关于印度政治平权行动对发展影响的数据(约30,000个观测)。所有计算在单核、8GB内存环境下运行。

Analytical Strategy

主要分析策略包括:(1)比较gKRLS(δ=5和15)与传统KRLS、bigKRLS(截断和非截断)在不同样本量下的估计时间和预测精度;(2)通过模拟比较将固定效应置于核外(gKRLS)与纳入核内(bigKRLS)的性能差异,考察不同ρ水平下的表现;(3)使用REML自动校准正则化参数,避免网格搜索;(4)在实证分析中,gKRLS用于估计含随机效应、样条、KRLS和固定效应的复杂分层模型,以及用于DML等需多次拟合模型的算法。稳健性检查包括:不同草图乘数(δ=5 vs. 15)的结果稳定性比较,以及多次拟合不同草图矩阵的敏感性分析。

Results & Findings

  • 计算效率大幅提升:gKRLS在10,000观测上约6秒,100,000观测约2分钟(δ=15),1,000,000观测(δ=5)不到1小时。传统KRLS和bigKRLS在超过10,000观测时需数小时。gKRLS的计算复杂度显著低于传统方法的立方级增长。这一发现验证了子采样草图的有效性,使KRLS类方法首次可应用于大规模数据集。
  • 预测精度保持:在“Three Hills, Three Valleys”模拟中,gKRLS(δ=5和15)的RMSE与传统KRLS和bigKRLS(非截断)相当,仅bigKRLS截断版本表现明显较差。这表明草图化并未以牺牲预测质量为代价。
  • 固定效应置于核外的优势:当数据生成过程包含组固定效应且x1与μj相关时,gKRLS(固定效应在核外)在中等规模数据集上的表现优于bigKRLS(所有变量在核内)。原因在于将固定效应纳入核内会假设所有协变量的边际效应随组变化,这在每组观测有限时过于灵活,导致过拟合。这一发现支持了模块化模型构建的必要性。
  • 实证应用可行性:Newman(2016)数据的复杂模型(含随机效应、样条、KRLS和固定效应)约10分钟完成估计;Gulzar等(2020)的约30,000观测数据,含多个非惩罚协变量和单一核,估计仅需几分钟,且可支持DML等需拟合10-15次模型的算法。
  • 草图稳定性:当核函数较简单时,不同草图矩阵的结果高度稳定;当核函数较复杂时,可能需要更大的δ(如15)以确保估计稳定。作者建议研究者多次拟合以检查稳健性。

Limitations

作者承认以下局限:(1)子采样草图可能无法充分代表原始数据,尤其在核函数复杂时,可能导致估计偏差;(2)草图引入的随机性意味着不同草图矩阵会产生不同估计,论文未精确刻画这种变异的影响;(3)论文仅探索了子采样草图一种加速方法,其他技术(如随机特征)留待未来研究;(4)δ的默认设置(δ=5)基于经验,可能不适用于所有场景,研究者需根据数据调整;(5)论文未系统比较gKRLS与其他非参数方法(如贝叶斯非参数模型)的性能。

Key Contributions

  • 提出gKRLS框架,将KRLS重新表述为分层模型,实现模块化模型构建,支持随机效应、样条、非惩罚固定效应及多核组合。
  • 将REML方法推广至多正则化参数场景,实现自动校准,避免昂贵的网格搜索或交叉验证。
  • 引入子采样草图技术,将KRLS的计算复杂度从立方级降至近线性,使模型可处理数万至数十万观测。
  • 扩展KRLS至非高斯结果(如二项、泊松、多项),并提供基于贝叶斯视角的稳健/聚类标准误,改善覆盖概率。
  • 提供新软件,支持边际效应和预测结果的计算,并集成至stacking和DML等机器学习框架。
  • 通过模拟和实证分析,系统展示了gKRLS在计算效率、预测精度和模型灵活性上的优势。

Key Claims

"Kernel regularized least squares (KRLS) is a popular method for flexibly estimating models that may have complex relationships between variables. However, its usefulness to many researchers is limited for two reasons. First, existing approaches are inflexible and do not allow KRLS to be combined with theoretically motivated extensions such as random effects, unregularized fixed effects, or non-Gaussian outcomes. Second, estimation is extremely computationally intensive for even modestly sized datasets." (Abstract)

"We note that KRLS can be re-formulated as a hierarchical model thereby allowing easy inference and modular model construction where KRLS can be used alongside random effects, splines, and unregularized fixed effects." (Abstract)

"Computationally, we also implement random sketching to dramatically accelerate estimation while incurring a limited penalty in estimation quality. We demonstrate that gKRLS can be fit on datasets with tens of thousands of observations in under 1 min." (Abstract)

"Traditional KRLS usually requires that one include all covariates in a single kernel. This has the benefit of allowing the marginal effect of each variable to depend on all others. However, this could be too flexible and require enormous amounts of data to reliably learn the underlying relationship." (Section 4.1)

"Assuming it is computationally feasible, a researcher might fit the model multiple times with different sketching matrices to show robustness. If the quantity of interest seems to vary considerably, we suggest increasing the size of the sketching dimension." (Section 3.1)


My Notes